> grep -r "local LLM"▋
8 entradas
2026-10-06
llama.cpp vs Ollama — ¿cuál deberías ejecutar?
El registro público, leído no ejecutado: Ollama fija su motor llama.cpp en b11351 mientras upstream entrega b11443. Uno es un electrodoméstico, el otro es la sala de máquinas.
2026-10-02
Calculadora de VRAM para GGUF: comprueba antes de descargar
Tamaño del modelo, cuant y contexto de entrada — pesos, caché KV y veredicto por tarjeta de salida. La calculadora responde si cabe antes de empezar la descarga.
2026-09-23
¿Puede vLLM ejecutar GGUF? Sí — solo en GPU
¿Puede vLLM ejecutar GGUF? Sí — con el plugin oficial, solo en GPU. La sintaxis serve, la trampa del tokenizer, los límites de hardware y cuándo gana llama.cpp.
2026-09-13
Cuantización GGUF: Q4_K_M vs Q8_0, tamaño y VRAM
Niveles de cuantización GGUF comparados: Q4_K_M vs Q8_0 en tamaño, VRAM y calidad, y la regla — Q4_K_M por defecto, solo subes para código y matemáticas.
2026-09-10
llama.cpp vs Ollama: cuál usar en 2026
llama.cpp vs Ollama: Ollama envuelve llama.cpp por comodidad, el llama.cpp puro gana en velocidad y control. Benchmarks, flags de GPU y cuándo gana cada uno.
2026-09-07
Cómo correr modelos GGUF en local: Ollama, llama.cpp y vLLM
Cómo correr modelos GGUF en local: pulls de Ollama en una línea, llama.cpp directo desde una URL de Hugging Face y cómo elegir el quant según tu VRAM.
2026-09-04
Mejor LLM local para código: de 8 a 24 GB de VRAM
El mejor LLM local para programar por tramo de VRAM: Qwen3 Coder vs DeepSeek a 8, 12, 16 y 24 GB, el quant correcto por tarjeta y un setup de Ollama listo.
2026-09-01
Ollama vs LM Studio: qué herramienta local de LLM elegir
Ollama vs LM Studio comparados en trabajo real de desarrollo: instalación, GPU, velocidad y servido de API, con comandos listos para elegir hoy mismo.